메뉴

#SWE-Bench Pro

TD
The Decoder 19일 전
IMP 7

OpenAI, 인기 코딩 벤치마크 30% 결함 발견

OpenAI가 널리 쓰이는 AI 코딩 평가 테스트인 'SWE-Bench Pro'의 약 30%가 결함이 있다는 사실을 발견하고 공식 지지를 철회했습니다. 단순한 공백 오차나 숨겨진 정답 우회 등으로 인해 AI의 실제 코딩 역량이 왜곡되어 평가되고 있기 때문입니다. 이에 따라 AI 업계는 권위 있던 기존 순위표를 폐기하고, 보다 신뢰할 수 있는 새로운 벤치마크 마련을 촉구하고 있습니다.

OpenAI 벤치마크 SWE-Bench Pro